<!DOCTYPE html>
<html class="client-nojs vector-feature-language-in-header-enabled vector-feature-language-in-main-page-header-disabled vector-feature-page-tools-pinned-disabled vector-feature-toc-pinned-clientpref-0 vector-toc-not-available vector-feature-main-menu-pinned-disabled vector-feature-limited-width-clientpref-1 vector-feature-limited-width-content-enabled vector-feature-custom-font-size-clientpref-1 vector-feature-appearance-pinned-clientpref-0 skin-theme-clientpref-day vector-sticky-header-enabled" lang="de" dir="ltr"><head>
<meta charset="UTF-8">
<title>Common Crawl</title>
<meta name="viewport" content="width=device-width, initial-scale=1.0">
<link rel="icon" type="image/png" href="./_res_/favicon.png">
<link rel="canonical" href="https://de.wikipedia.org/wiki/Common_Crawl"> <link href="./_mw_/ext.cite.styles.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.wikimediamessages.styles.css" rel="stylesheet" type="text/css">
<link href="./_mw_/skins.vector.icons.css" rel="stylesheet" type="text/css">
<link href="./_mw_/skins.vector.search.codex.styles.css" rel="stylesheet" type="text/css">
<link href="./_mw_/skins.vector.styles.css" rel="stylesheet" type="text/css">
<meta name="ResourceLoaderDynamicStyles" content="">
<link href="./_mw_/ext.gadget.citeRef.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.gadget.defaultPlainlinks.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.gadget.dewikiCommonHide.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.gadget.dewikiCommonLayout.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.gadget.dewikiCommonStyle.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.gadget.dewikiDarkmode.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.gadget.dewikiResponsive.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.gadget.specialSearch.css" rel="stylesheet" type="text/css">
<link rel="stylesheet" type="text/css" href="./_mw_/site.styles.css">
<link rel="stylesheet" type="text/css" href="./_mw_/noscript.css">
<link rel="stylesheet" type="text/css" href="./_res_/footer.css">
<link rel="stylesheet" type="text/css" href="./_res_/vector-2022.css">
</head>
<body class="skin--responsive skin-vector skin-vector-search-vue mediawiki ltr sitedir-ltr mw-hide-empty-elt ns-0 ns-subject page-Common_Crawl rootpage-Common_Crawl skin-vector-2022 action-view">
<div class="mw-page-container">
<div class="mw-page-container-inner">
<div class="mw-content-container">
<main id="content" class="mw-body">
<header class="mw-body-header vector-page-titlebar">
<h1 id="firstHeading" class="firstHeading mw-first-heading"><span class="mw-page-title-main">Common Crawl</span></h1>
</header>
<a id="top"></a>
<div id="bodyContent" class="vector-body ve-init-mw-desktopArticleTarget-targetContainer" aria-labelledby="firstHeading" data-mw-ve-target-container="">
<div id="contentSub">
<div id="mw-content-subtitle"></div>
</div>
<div id="mw-content-text" class="mw-body-content mw-content-ltr" lang="de" dir="ltr"><div class="mw-content-ltr mw-parser-output" lang="de" dir="ltr"><table class="infobox float-right toccolours toptextcells" style="margin: 0 0 1em 1em; width: 25em; font-size: 90%; text-align: left;">
<tbody><tr>
<th colspan="2" class="hintergrundfarbe5" style="font-size:110%; text-align: center;">Common Crawl <br>(CC)
</th></tr>
<tr>
<td colspan="2" class="notheme" style="text-align: center; padding:1em 0; background-color:#f8f9fa; color:#202122;">
</td></tr>
<tr style="vertical-align: top">
<th>Rechtsform
</th>
<td><a href="501(c)_organization" title="501(c) organization">501(c)(3) (Gemeinnützige) Organisation</a>
</td></tr>
<tr style="vertical-align: top">
<th>Gründung
</th>
<td>2007
</td></tr>
<tr style="vertical-align: top">
<th>Gründer
</th>
<td>Gil Elbaz
</td></tr>
<tr style="vertical-align: top">
<th>Sitz
</th>
<td>Beverly Hills, CA 90210, USA
</td></tr>
<tr>
<td colspan="2" style="border-top: solid 1px #ccd2d9; border-bottom: 0; padding: 0;">
</td></tr>
<tr style="vertical-align: top">
<th>Schwerpunkt
</th>
<td><a href="Web-Archivierung" class="mw-redirect" title="Web-Archivierung">Web-Archivierung</a>
</td></tr>
<tr>
<td colspan="2" style="border-top: solid 1px #ccd2d9; border-bottom: 0; padding: 0;">
</td></tr>
<tr style="vertical-align: top">
<th>Umsatz
</th>
<td class="wikidata-content">1.297.813 US-Dollar <small>(2023)</small>
</td></tr>
<tr>
<td colspan="2" style="border-top: solid 1px #ccd2d9; border-bottom: 0; padding: 0;">
</td></tr>
<tr style="vertical-align: top">
<th>Website
</th>
<td><a rel="nofollow" class="external text" href="https://commoncrawl.org">commoncrawl.org</a>
</td></tr>
</tbody></table>
<p><b>Common Crawl</b> ist eine <a href="501(c)_organization#501.28c.29.283.29" title="501(c) organization">501(c)(3)</a>-Nonprofit-Organisation, die öffentliche Webseiten ausliest, archiviert und die so gewonnenen Daten verfügbar macht.<sup id="cite_ref-:0_1-0" class="reference"><a href="#cite_note-:0-1"><span class="cite-bracket">[</span>1<span class="cite-bracket">]</span></a></sup> Sie wurde 2007 von Gil Elbaz gegründet. Ein erster Crawl wurde 2011 veröffentlicht, seit 2013 archiviert die Organisation monatlich Webseiten.<sup id="cite_ref-:1_2-0" class="reference"><a href="#cite_note-:1-2"><span class="cite-bracket">[</span>2<span class="cite-bracket">]</span></a></sup> Bereits 2017 umfasste ein Monatsarchiv über 280 <a href="Byte#Binärpräfixe" title="Byte">TebiByte</a> (TiB),<sup id="cite_ref-:0_1-1" class="reference"><a href="#cite_note-:0-1"><span class="cite-bracket">[</span>1<span class="cite-bracket">]</span></a></sup> 2025 betrug die unkomprimierte Größe eines Monatsarchives über 420 TiB.<sup id="cite_ref-3" class="reference"><a href="#cite_note-3"><span class="cite-bracket">[</span>3<span class="cite-bracket">]</span></a></sup>
</p><p>Die <a href="Webcrawler" title="Webcrawler">Webcrawls</a> umfassen große Mengen urheberrechtlich geschützter Daten und können in den USA unter <a href="Fair_Use" title="Fair Use">Fair-Use</a>-Richtlinien genutzt werden. In anderen Ländern ist die Nutzung rechtlich schwieriger, weshalb spezielle Verarbeitungsformate entwickelt wurden, um eine Verbreitung der Archive unter der jeweiligen <a href="Zust%C3%A4ndigkeit" title="Zuständigkeit">Jurisdiktion</a> zu erlauben.<sup id="cite_ref-4" class="reference"><a href="#cite_note-4"><span class="cite-bracket">[</span>4<span class="cite-bracket">]</span></a></sup>
</p><p>Ziel ist die Unterstützung von Forschung und Technologieentwicklung, indem große Datenmengen erzeugt und bereitgestellt werden, die ansonsten nur Großkonzernen zugänglich wären.<sup id="cite_ref-:2_5-0" class="reference"><a href="#cite_note-:2-5"><span class="cite-bracket">[</span>5<span class="cite-bracket">]</span></a></sup>
</p>
<div class="mw-heading mw-heading2"><h2 id="Inhalte_und_Verwendung">Inhalte und Verwendung</h2></div>
<p>Common Crawl archiviert im Monatsrhythmus Webseiten, die nicht durch eine entsprechende Direktive in der <a href="Robots_Exclusion_Standard" title="Robots Exclusion Standard">robots.txt</a> von der Erfassung ausgeschlossen werden. Die Daten werden im <a href="Web_ARChive" title="Web ARChive">warc-Format</a> komprimiert und gespeichert.<sup id="cite_ref-6" class="reference"><a href="#cite_note-6"><span class="cite-bracket">[</span>6<span class="cite-bracket">]</span></a></sup> Stand Oktober 2025 sind ungefähr 44,8 % der erfassten Inhalte englischsprachig, es folgen russisch (5,8 %) und deutsch (5,6 %).<sup id="cite_ref-7" class="reference"><a href="#cite_note-7"><span class="cite-bracket">[</span>7<span class="cite-bracket">]</span></a></sup>
</p><p>Zu den Webseiteninhalten legt Common Crawl auch <a href="Graphentheorie" title="Graphentheorie">Netzwerkgraphen</a> an, die Verweisstrukturen auf <a href="Hostname" title="Hostname">Hostebene</a> abbilden. 2024 umfassten diese Analysen über 480 Millionen <a href="Netzwerkknoten" title="Netzwerkknoten">Netzwerkknoten</a> und 3,4 Milliarden Verbindungen,<sup id="cite_ref-:1_2-1" class="reference"><a href="#cite_note-:1-2"><span class="cite-bracket">[</span>2<span class="cite-bracket">]</span></a></sup> die ebenfalls frei zur Verfügung gestellt werden.
</p><p>Die Archive werden unter anderem durch das <a href="Amazon_Web_Services" title="Amazon Web Services">AWS</a> Open Data Sponsorship Program von <a href="Amazon" title="Amazon">Amazon</a> zur Verfügung gestellt,<sup id="cite_ref-8" class="reference"><a href="#cite_note-8"><span class="cite-bracket">[</span>8<span class="cite-bracket">]</span></a></sup> das <a href="Internet_Archive" title="Internet Archive">Internet Archive</a> legt ebenso <a href="Spiegelserver" title="Spiegelserver">Mirrors</a> der Common Crawl-Archive an.<sup id="cite_ref-9" class="reference"><a href="#cite_note-9"><span class="cite-bracket">[</span>9<span class="cite-bracket">]</span></a></sup> In Deutschland hostet die <a href="Hochschule_f%C3%BCr_Angewandte_Wissenschaften_Hof" title="Hochschule für Angewandte Wissenschaften Hof">Hochschule Hof</a> einen deutschen <a href="Textkorpus#Teilkorpora_und_Referenzkorpora" title="Textkorpus">Teilkorpus</a>,<sup id="cite_ref-10" class="reference"><a href="#cite_note-10"><span class="cite-bracket">[</span>10<span class="cite-bracket">]</span></a></sup> den <i>German colossal, cleaned Common Crawl corpus</i>.<sup id="cite_ref-11" class="reference"><a href="#cite_note-11"><span class="cite-bracket">[</span>11<span class="cite-bracket">]</span></a></sup>
</p><p>Genutzt werden die Archive unter anderem von <a href="Google_LLC" title="Google LLC">Google</a>, die mit einem bereinigten Datenset der Common Crawl-Archive ihre <a href="Sprachmodell" title="Sprachmodell">Sprachmodelle</a> trainierten.<sup id="cite_ref-12" class="reference"><a href="#cite_note-12"><span class="cite-bracket">[</span>12<span class="cite-bracket">]</span></a></sup> Ebenso verwendete <a href="OpenAI" title="OpenAI">OpenAI</a> den Common Crawl zum Training ihres Sprachmodells <a href="GPT-3" title="GPT-3">GPT-3</a>.<sup id="cite_ref-13" class="reference"><a href="#cite_note-13"><span class="cite-bracket">[</span>13<span class="cite-bracket">]</span></a></sup> 2024 ergab eine Untersuchung der <a href="Mozilla_Foundation" title="Mozilla Foundation">Mozilla Foundation</a>, dass ein Großteil der gängigen Sprachmodelle die Common Crawl-Archive für das Training verwendeten, die zu diesem Zeitpunkt ein Volumen von über neun <a href="Petabyte" class="mw-redirect" title="Petabyte">Petabyte</a> umfassten.<sup id="cite_ref-:2_5-1" class="reference"><a href="#cite_note-:2-5"><span class="cite-bracket">[</span>5<span class="cite-bracket">]</span></a></sup> Die Daten sind indessen nicht unbedingt zum direkten Training von Sprach- und KI-Modellen geeignet, da sie nicht <a href="Kurator#Wissenskuratierung" title="Kurator">kuratiert</a> werden und auch <a href="Hassrede" title="Hassrede">Hassrede</a> oder pornografische Inhalte beinhalten. Dennoch gelte Common Crawl als eine der „wichtigsten Quellen für Trainingsdaten für Large Language Models“ (<a href="Englische_Sprache" title="Englische Sprache">englisch</a> „most important sources of pre-training data for large language models (LLMs)“) und werde so intensiv genutzt, dass sie ein maßgeblicher Baustein zur Entwicklung großer Sprachmodelle und daraus entwickelter Plattformen für <a href="Generatives_KI-Modell" title="Generatives KI-Modell">generative AI</a> geworden sei.<sup id="cite_ref-14" class="reference"><a href="#cite_note-14"><span class="cite-bracket">[</span>14<span class="cite-bracket">]</span></a></sup>
</p><p>Common Crawl-Daten spielen auch im <a href="Online-Marketing" title="Online-Marketing">Online-Marketing</a> eine Rolle, da sie neben Google und OpenAI auch beispielsweise von <a href="Grok" title="Grok">Grok</a>, <a href="DeepSeek" title="DeepSeek">DeepSeek</a> und <a href="Meta_AI" title="Meta AI">Meta AI</a> verwendet werden und angenommen wird, dass das Vorkommen einer Webseite in Common Crawl-Archiven ihre Nennung in KI-Antworten begünstigt.<sup id="cite_ref-:1_2-2" class="reference"><a href="#cite_note-:1-2"><span class="cite-bracket">[</span>2<span class="cite-bracket">]</span></a></sup>
</p>
<div class="mw-heading mw-heading2"><h2 id="Weblinks">Weblinks</h2></div>
<ul><li><a rel="nofollow" class="external text" href="https://github.com/commoncrawl/">Common Crawl GitHub Repository</a></li></ul>
<div class="mw-heading mw-heading2"><h2 id="Einzelnachweise">Einzelnachweise</h2></div>
<ol class="references">
<li id="cite_note-:0-1"><span class="mw-cite-backlink">↑ <sup><a href="#cite_ref-:0_1-0">a</a></sup> <sup><a href="#cite_ref-:0_1-1">b</a></sup></span> <span class="reference-text"><span class="cite">Kalev Leetaru: <a rel="nofollow" class="external text" href="https://www.forbes.com/sites/kalevleetaru/2017/09/28/common-crawl-and-unlocking-web-archives-for-research/"><i>Common Crawl And Unlocking Web Archives For Research.</i></a> In: <i>Forbes.</i> 28. September 2017,<span class="Abrufdatum"> abgerufen am 23. Oktober 2025</span> (englisch).</span><span style="display: none;" class="Z3988" title="ctx_ver=Z39.88-2004&rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Adc&rfr_id=info%3Asid%2Fde.wikipedia.org%3ACommon+Crawl&rft.title=Common+Crawl+And+Unlocking+Web+Archives+For+Research&rft.description=Common+Crawl+And+Unlocking+Web+Archives+For+Research&rft.identifier=https%3A%2F%2Fwww.forbes.com%2Fsites%2Fkalevleetaru%2F2017%2F09%2F28%2Fcommon-crawl-and-unlocking-web-archives-for-research%2F&rft.creator=Kalev+Leetaru&rft.date=2017-09-28&rft.language=en"> </span></span>
</li>
<li id="cite_note-:1-2"><span class="mw-cite-backlink">↑ <sup><a href="#cite_ref-:1_2-0">a</a></sup> <sup><a href="#cite_ref-:1_2-1">b</a></sup> <sup><a href="#cite_ref-:1_2-2">c</a></sup></span> <span class="reference-text"><span class="cite">Brett Tabke: <a rel="nofollow" class="external text" href="https://www.searchengineworld.com/who-what-where-is-common-crawl-and-why-should-site-owners-care"><i>What is the Common Crawl Database, and Why should a Site Owner Care?</i></a> In: <i>SearchEngineWorld.</i> 25. September 2025,<span class="Abrufdatum"> abgerufen am 23. Oktober 2025</span> (amerikanisches Englisch).</span><span style="display: none;" class="Z3988" title="ctx_ver=Z39.88-2004&rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Adc&rfr_id=info%3Asid%2Fde.wikipedia.org%3ACommon+Crawl&rft.title=What+is+the+Common+Crawl+Database%2C+and+Why+should+a+Site+Owner+Care%3F&rft.description=What+is+the+Common+Crawl+Database%2C+and+Why+should+a+Site+Owner+Care%3F&rft.identifier=https%3A%2F%2Fwww.searchengineworld.com%2Fwho-what-where-is-common-crawl-and-why-should-site-owners-care&rft.creator=Brett+Tabke&rft.date=2025-09-25&rft.language=en-US"> </span></span>
</li>
<li id="cite_note-3"><span class="mw-cite-backlink"><a href="#cite_ref-3">↑</a></span> <span class="reference-text"><span class="cite">Thom Vaughan: <a rel="nofollow" class="external text" href="https://commoncrawl.org/blog/september-2025-crawl-archive-now-available"><i>Common Crawl - Blog - September 2025 Crawl Archive Now Available.</i></a> 22. September 2025,<span class="Abrufdatum"> abgerufen am 23. Oktober 2025</span> (englisch).</span><span style="display: none;" class="Z3988" title="ctx_ver=Z39.88-2004&rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Adc&rfr_id=info%3Asid%2Fde.wikipedia.org%3ACommon+Crawl&rft.title=Common+Crawl+-+Blog+-+September+2025+Crawl+Archive+Now+Available&rft.description=Common+Crawl+-+Blog+-+September+2025+Crawl+Archive+Now+Available&rft.identifier=https%3A%2F%2Fcommoncrawl.org%2Fblog%2Fseptember-2025-crawl-archive-now-available&rft.creator=Thom+Vaughan&rft.date=2025-09-22&rft.language=en"> </span></span>
</li>
<li id="cite_note-4"><span class="mw-cite-backlink"><a href="#cite_ref-4">↑</a></span> <span class="reference-text">Roland Schäfer: <cite style="font-style:italic">CommonCOW: Massively Huge Web Corpora from CommonCrawl Data and a Method to Distribute them Freely under Restrictive EU Copyright Laws</cite>. In: <cite style="font-style:italic">Proceedings of the Tenth International Conference on Language Resources and Evaluation (LREC'16)</cite>. European Language Resources Association (ELRA), Portorož, Slovenia Mai 2016, <span style="white-space:nowrap">S.<span style="display:inline-block;width:.2em"> </span>4500–4504</span> (<a rel="nofollow" class="external text" href="https://aclanthology.org/L16-1712/">aclanthology.org</a> [abgerufen am 23. Oktober 2025]).<span class="Z3988" title="ctx_ver=Z39.88-2004&rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Abook&rfr_id=info:sid/de.wikipedia.org:Common+Crawl&rft.atitle=CommonCOW%3A+Massively+Huge+Web+Corpora+from+CommonCrawl+Data+and+a+Method+to+Distribute+them+Freely+under+Restrictive+EU+Copyright+Laws&rft.au=Roland+Sch%C3%A4fer&rft.btitle=Proceedings+of+the+Tenth+International+Conference+on+Language+Resources+and+Evaluation+%28LREC%2716%29&rft.date=2016-05&rft.genre=book&rft.pages=4500-4504&rft.place=Portoro%C5%BE%2C+Slovenia&rft.pub=European+Language+Resources+Association+%28ELRA%29" style="display:none"> </span></span>
</li>
<li id="cite_note-:2-5"><span class="mw-cite-backlink">↑ <sup><a href="#cite_ref-:2_5-0">a</a></sup> <sup><a href="#cite_ref-:2_5-1">b</a></sup></span> <span class="reference-text"><span class="cite">Stefan Baack et al.: <a rel="nofollow" class="external text" href="https://www.mozillafoundation.org/de/research/library/generative-ai-training-data/common-crawl/"><i>Training Data for the Price of a Sandwich: Common Crawl’s Impact on Generative AI.</i></a> Mozilla Foundation, 6. Februar 2024,<span class="Abrufdatum"> abgerufen am 23. Oktober 2025</span> (englisch).</span><span style="display: none;" class="Z3988" title="ctx_ver=Z39.88-2004&rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Adc&rfr_id=info%3Asid%2Fde.wikipedia.org%3ACommon+Crawl&rft.title=Training+Data+for+the+Price+of+a+Sandwich%3A+Common+Crawl%E2%80%99s+Impact+on+Generative+AI&rft.description=Training+Data+for+the+Price+of+a+Sandwich%3A+Common+Crawl%E2%80%99s+Impact+on+Generative+AI&rft.identifier=https%3A%2F%2Fwww.mozillafoundation.org%2Fde%2Fresearch%2Flibrary%2Fgenerative-ai-training-data%2Fcommon-crawl%2F&rft.creator=Stefan+Baack+et+al.&rft.publisher=Mozilla+Foundation&rft.date=2024-02-06&rft.language=en"> </span></span>
</li>
<li id="cite_note-6"><span class="mw-cite-backlink"><a href="#cite_ref-6">↑</a></span> <span class="reference-text"><span class="cite"><a rel="nofollow" class="external text" href="https://commoncrawl.org/blog/new-crawl-data-available"><i>Common Crawl - Blog - New Crawl Data Available!</i></a> Common Crawl Foundation, 27. November 2013,<span class="Abrufdatum"> abgerufen am 23. Oktober 2025</span> (englisch).</span><span style="display: none;" class="Z3988" title="ctx_ver=Z39.88-2004&rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Adc&rfr_id=info%3Asid%2Fde.wikipedia.org%3ACommon+Crawl&rft.title=Common+Crawl+-+Blog+-+New+Crawl+Data+Available%21&rft.description=Common+Crawl+-+Blog+-+New+Crawl+Data+Available%21&rft.identifier=https%3A%2F%2Fcommoncrawl.org%2Fblog%2Fnew-crawl-data-available&rft.publisher=Common+Crawl+Foundation&rft.date=2013-11-27&rft.language=en"> </span></span>
</li>
<li id="cite_note-7"><span class="mw-cite-backlink"><a href="#cite_ref-7">↑</a></span> <span class="reference-text"><span class="cite"><a rel="nofollow" class="external text" href="https://commoncrawl.github.io/cc-crawl-statistics/plots/languages.html"><i>Statistics of Common Crawl Monthly Archives by commoncrawl.</i></a><span class="Abrufdatum"> Abgerufen am 23. Oktober 2025</span> (englisch).</span><span style="display: none;" class="Z3988" title="ctx_ver=Z39.88-2004&rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Adc&rfr_id=info%3Asid%2Fde.wikipedia.org%3ACommon+Crawl&rft.title=Statistics+of+Common+Crawl+Monthly+Archives+by+commoncrawl&rft.description=Statistics+of+Common+Crawl+Monthly+Archives+by+commoncrawl&rft.identifier=https%3A%2F%2Fcommoncrawl.github.io%2Fcc-crawl-statistics%2Fplots%2Flanguages.html&rft.language=en"> </span></span>
</li>
<li id="cite_note-8"><span class="mw-cite-backlink"><a href="#cite_ref-8">↑</a></span> <span class="reference-text"><span class="cite"><a rel="nofollow" class="external text" href="https://aws.amazon.com/marketplace/pp/prodview-zxtb4t54iqjmy"><i>AWS Marketplace: Common Crawl.</i></a> In: <i>Amazon AWS.</i><span class="Abrufdatum"> Abgerufen am 23. Oktober 2025</span> (englisch).</span><span style="display: none;" class="Z3988" title="ctx_ver=Z39.88-2004&rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Adc&rfr_id=info%3Asid%2Fde.wikipedia.org%3ACommon+Crawl&rft.title=AWS+Marketplace%3A+Common+Crawl&rft.description=AWS+Marketplace%3A+Common+Crawl&rft.identifier=https%3A%2F%2Faws.amazon.com%2Fmarketplace%2Fpp%2Fprodview-zxtb4t54iqjmy&rft.language=en"> </span></span>
</li>
<li id="cite_note-9"><span class="mw-cite-backlink"><a href="#cite_ref-9">↑</a></span> <span class="reference-text"><span class="cite"><a rel="nofollow" class="external text" href="https://archive.org/details/commoncrawl"><i>Internet Archive: Common Crawl Web crawl data from Common Crawl.</i></a> In: <i>Internet Archive.</i> Internet Archive,<span class="Abrufdatum"> abgerufen am 23. Oktober 2025</span>.</span><span style="display: none;" class="Z3988" title="ctx_ver=Z39.88-2004&rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Adc&rfr_id=info%3Asid%2Fde.wikipedia.org%3ACommon+Crawl&rft.title=Internet+Archive%3A+Common+Crawl++Web+crawl+data+from+Common+Crawl.&rft.description=Internet+Archive%3A+Common+Crawl++Web+crawl+data+from+Common+Crawl.&rft.identifier=https%3A%2F%2Farchive.org%2Fdetails%2Fcommoncrawl&rft.publisher=Internet+Archive"> </span></span>
</li>
<li id="cite_note-10"><span class="mw-cite-backlink"><a href="#cite_ref-10">↑</a></span> <span class="reference-text"><span class="cite"><a rel="nofollow" class="external text" href="https://opendata.iisys.de/dataset/common-crawl-german/"><i>Common Crawl German – IISYS OpenData.</i></a> In: <i>iisys.de.</i> Institut für Informationssysteme der Hochschule Hof,<span class="Abrufdatum"> abgerufen am 23. Oktober 2025</span>.</span><span style="display: none;" class="Z3988" title="ctx_ver=Z39.88-2004&rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Adc&rfr_id=info%3Asid%2Fde.wikipedia.org%3ACommon+Crawl&rft.title=Common+Crawl+German+%E2%80%93+IISYS+OpenData&rft.description=Common+Crawl+German+%E2%80%93+IISYS+OpenData&rft.identifier=https%3A%2F%2Fopendata.iisys.de%2Fdataset%2Fcommon-crawl-german%2F&rft.publisher=Institut+f%C3%BCr+Informationssysteme+der+Hochschule+Hof&rft.language=de"> </span></span>
</li>
<li id="cite_note-11"><span class="mw-cite-backlink"><a href="#cite_ref-11">↑</a></span> <span class="reference-text"><span class="cite">Philip May, Philipp Reißel: <a rel="nofollow" class="external text" href="https://german-nlp-group.github.io/projects/gc4-corpus.html"><i>GC4 Corpus — German NLP Group documentation.</i></a><span class="Abrufdatum"> Abgerufen am 23. Oktober 2025</span> (englisch).</span><span style="display: none;" class="Z3988" title="ctx_ver=Z39.88-2004&rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Adc&rfr_id=info%3Asid%2Fde.wikipedia.org%3ACommon+Crawl&rft.title=GC4+Corpus+%E2%80%94+German+NLP+Group+documentation&rft.description=GC4+Corpus+%E2%80%94+German+NLP+Group+documentation&rft.identifier=https%3A%2F%2Fgerman-nlp-group.github.io%2Fprojects%2Fgc4-corpus.html&rft.creator=Philip+May%2C+Philipp+Rei%C3%9Fel&rft.language=en"> </span></span>
</li>
<li id="cite_note-12"><span class="mw-cite-backlink"><a href="#cite_ref-12">↑</a></span> <span class="reference-text"><span class="cite">Colin Raffel, Noam Shazeer, Adam Roberts, Katherine Lee, Sharan Narang, Michael Matena, Yanqi Zhou, Wei Li, Peter J. Liu: <a rel="nofollow" class="external text" href="http://arxiv.org/abs/1910.10683"><i>Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer.</i></a> 19. September 2023,<span class="Abrufdatum"> abgerufen am 23. Oktober 2025</span>.</span><span style="display: none;" class="Z3988" title="ctx_ver=Z39.88-2004&rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Adc&rfr_id=info%3Asid%2Fde.wikipedia.org%3ACommon+Crawl&rft.title=Exploring+the+Limits+of+Transfer+Learning+with+a+Unified+Text-to-Text+Transformer&rft.description=Exploring+the+Limits+of+Transfer+Learning+with+a+Unified+Text-to-Text+Transformer&rft.identifier=http%3A%2F%2Farxiv.org%2Fabs%2F1910.10683&rft.creator=Colin+Raffel%2C+Noam+Shazeer%2C+Adam+Roberts%2C+Katherine+Lee%2C+Sharan+Narang%2C+Michael+Matena%2C+Yanqi+Zhou%2C+Wei+Li%2C+Peter+J.+Liu&rft.date=2023-09-19"> </span></span>
</li>
<li id="cite_note-13"><span class="mw-cite-backlink"><a href="#cite_ref-13">↑</a></span> <span class="reference-text"><span class="cite">Tom B. Brown, Benjamin Mann, Nick Ryder, Melanie Subbiah, Jared Kaplan, Prafulla Dhariwal, Arvind Neelakantan, Pranav Shyam, Girish Sastry, Amanda Askell, Sandhini Agarwal, Ariel Herbert-Voss, Gretchen Krueger, Tom Henighan, Rewon Child, Aditya Ramesh, Daniel M. Ziegler, Jeffrey Wu, Clemens Winter, Christopher Hesse, Mark Chen, Eric Sigler, Mateusz Litwin, Scott Gray, Benjamin Chess, Jack Clark, Christopher Berner, Sam McCandlish, Alec Radford, Ilya Sutskever, Dario Amodei: <a rel="nofollow" class="external text" href="http://arxiv.org/abs/2005.14165"><i>Language Models are Few-Shot Learners.</i></a> 22. Juli 2020,<span class="Abrufdatum"> abgerufen am 23. Oktober 2025</span>.</span><span style="display: none;" class="Z3988" title="ctx_ver=Z39.88-2004&rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Adc&rfr_id=info%3Asid%2Fde.wikipedia.org%3ACommon+Crawl&rft.title=Language+Models+are+Few-Shot+Learners&rft.description=Language+Models+are+Few-Shot+Learners&rft.identifier=http%3A%2F%2Farxiv.org%2Fabs%2F2005.14165&rft.creator=Tom+B.+Brown%2C+Benjamin+Mann%2C+Nick+Ryder%2C+Melanie+Subbiah%2C+Jared+Kaplan%2C+Prafulla+Dhariwal%2C+Arvind+Neelakantan%2C+Pranav+Shyam%2C+Girish+Sastry%2C+Amanda+Askell%2C+Sandhini+Agarwal%2C+Ariel+Herbert-Voss%2C+Gretchen+Krueger%2C+Tom+Henighan%2C+Rewon+Child%2C+Aditya+Ramesh%2C+Daniel+M.+Ziegler%2C+Jeffrey+Wu%2C+Clemens+Winter%2C+Christopher+Hesse%2C+Mark+Chen%2C+Eric+Sigler%2C+Mateusz+Litwin%2C+Scott+Gray%2C+Benjamin+Chess%2C+Jack+Clark%2C+Christopher+Berner%2C+Sam+McCandlish%2C+Alec+Radford%2C+Ilya+Sutskever%2C+Dario+Amodei&rft.date=2020-07-22"> </span></span>
</li>
<li id="cite_note-14"><span class="mw-cite-backlink"><a href="#cite_ref-14">↑</a></span> <span class="reference-text">Stefan Baack: <cite style="font-style:italic">A Critical Analysis of the Largest Source for Generative AI Training Data: Common Crawl</cite>. ACM, 2024, ISBN 979-84-0070450-5, <span style="white-space:nowrap">S.<span style="display:inline-block;width:.2em"> </span>2199–2208</span>, <a href="Digital_Object_Identifier" title="Digital Object Identifier">doi</a>:<span class="uri-handle" style="white-space:nowrap"><a rel="nofollow" class="external text" href="https://doi.org/10.1145/3630106.3659033">10.1145/3630106.3659033</a></span> (<a rel="nofollow" class="external text" href="https://dl.acm.org/doi/10.1145/3630106.3659033">acm.org</a> [abgerufen am 23. Oktober 2025]).<span class="Z3988" title="ctx_ver=Z39.88-2004&rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Abook&rfr_id=info:sid/de.wikipedia.org:Common+Crawl&rft.au=Stefan+Baack&rft.btitle=A+Critical+Analysis+of+the+Largest+Source+for+Generative+AI+Training+Data%3A+Common+Crawl&rft.date=2024-06-03&rft.doi=10.1145%2F3630106.3659033&rft.genre=book&rft.isbn=9798400704505&rft.pages=2199-2208&rft.pub=ACM" style="display:none"> </span></span>
</li>
</ol></div><!--htdig_noindex--><div><div class="zim-footer">
Dieser Artikel wurde von <a class="external text" title="Zuletzt bearbeitet am 2025-11-21" href="https://de.wikipedia.org/wiki/?title=Common_Crawl&oldid=261747921">Wikipedia</a> herausgegeben. Der Text ist unter <a class="external text" href="https://creativecommons.org/licenses/by-sa/4.0/deed.de">Creative Commons Attribution-Share Alike 4.0</a> verfügbar, sofern nicht anders angegeben. Für die Mediendateien können zusätzliche Bedingungen gelten.
</div>
</div><!--/htdig_noindex--></div>
</div>
</main>
</div>
</div>
</div>
<script src="./_webp_/webpHandler.js"></script>
</body></html>